做到 Day 19,Agent 已經能呼叫真實模型,也有輸入、檢索、工具和後端授權邊界。接下來最容易讓資料越積越多的功能,是記憶。 記住「這台測試筆電是 Win...
前面幾天,我陸續替 Agent 加上 Input、Retrieval 和 Tool Output 檢查。做到這裡很容易產生一個錯覺:既然請求已經通過 Guard...
「忽略前面指令」不會真的改寫 system prompt。麻煩的是,模型可能把它當成更值得服從的新要求,接著改變回答,甚至選到不該碰的工具。 今天我把檢查位置移...
Day 16 檢查的是模型送往工具的參數。工具跑完之後,資料還會反方向流回 Agent:tool result 進入 context,模型看完再決定下一步。 這...
Day 15 我把不需要的外寄工具移出 Helpdesk Agent。不過未來若真的有一條受限流程,要把 SOP 摘要交給支援信箱,事情不會只是把 share_...
Day 14 處理的是哪些文件能進入 RAG。今天輪到另一份同樣會塞進模型 context 的東西:工具定義。 我先故意列出 20 個 Helpdesk 候選工...
Day 13 我用 Promptfoo 反覆測惡意 SOP,但還有一種文件根本不需要藏指令:它只要屬於別的使用者、部門或 tenant,被當前 Agent 搜出...
Day 11 我做了一份惡意 SOP,Day 12 又整理了 context。不過只擋住一句「忽略先前規則」,還不能代表 retrieval boundary...
Day 10 我先把 context 的來源分開,Day 11 再把惡意 SOP 擋在模型外面。做到這裡,我原本很自然地想:既然不可信內容已經過濾,那多放一點歷...
Day 11|RAG 最危險的不是幻覺,而是它把資料當成命令 Day 10 我把 system prompt、使用者訊息、RAG 文件和 tool result...
在 Day 6 拆 Agent loop 時,一直卡在同一件事:模型下一輪看到的東西,會同時包含 system prompt、使用者訊息、SOP 查詢結果和工具...
前幾天我把 Promptfoo 放進這個專案時,主要是在看結果:有沒有建立 mock 工單、越權工具是否不存在、SOP 壞掉時有沒有假裝成功。 這些測試還不夠。...
Day 4 做完 timeout、退避重試和降級後,我本來以為這件事差不多收工了:SOP 查不到,最多重試幾次,然後不要開工單。 但那只限制了「同一個請求」。如...
Day 6 的 recursion_limit 解決了一件事:graph 不該無限繞圈。但我很快發現,step 數根本不能回答「這次到底花了多少」。一次 ste...
我一開始把 Agent 想得太像一個會「理解整個任務」的助手。實際把 Helpdesk Agent 拆開後,感覺比較像一個不停改變狀態的程式:模型看見目前資料,...
前四天,我把這個練習專案拆得很保守:它只能查 mock SOP,然後在記憶體裡建立 mock 工單。 但程式能動,不代表我知道它會不會在改一行 prompt、補...
工具失敗時,Agent 最危險的反應往往不是回覆錯誤,而是把同一個請求又送了一次。 Day 3 我只讓 Agent 查 mock SOP、建立 mock 工...
同一把 API Key 同時能查資料、開工單、重設帳號、寄通知時,Agent 的工具清單就不再只是功能清單。 我沒有公司的 API Key。這個專案用的是...
今天我先做一個故意很單純的版本:它會開工單,但還不安全。 昨天我先把「Agent 有工具以後會出什麼事」講清楚。今天我不急著加 Guardrails,反而先...
上一篇看的是怎麼規劃一次 AI 安全檢測,這篇換到攻擊之外的隱私、治理跟法規。 2023 年 3 月三星開放半導體部門的工程師用 ChatGPT,不到三個星期,...
上一篇看的是 Agent 的權限、記憶誰能寫、MCP Server 跟模型檔這四道防線,這篇把它們收成一份可以照著走的流程。如果有人請你去看一個 AI 系統安不...
上一篇看的是 Prompt Injection 防護做在哪幾層,這篇我們來看 OWASP 的第 8 到 10 條建議,Agent 手上能同時碰哪些東西、它的記憶...
上一篇看的是 garak 怎麼自動對模型跑一輪弱掃,這篇換到防守,看 Prompt Injection 防護要做在哪幾層。 AI 黑魔法(07) 講過,對模型來...
上一篇看的是六種只靠送查詢就打得了的攻擊,這篇換工具上場,把攻擊交給 garak 來執行。 garak 是 Red Team 工具,設計目的是用來測試模型安全性...
上一篇看的是攻擊者怎麼把模型教壞,從資料投毒一路做到只有特定 Trigger 才發作的後門,這篇換成一個從頭到尾都乾淨的模型,攻擊者不碰權重,只是不斷送查詢進去...
上一篇看的是模型、Tokenizer 與設定檔在交付途中有沒有被換掉,這篇看資料本身,有毒的資料是怎麼被模型學進去,最後是怎麼成長為只有特定 Trigger 才...
查核資訊: 本文於 2026-08-25 重新確認各項資源的官方頁面。OWASP 清單、靶場內容、模型版本與工具介面都可能變動;開始練習前,仍應回到官方文件確...
上一篇從模型服務出發,看的是模型呼叫用了誰的權限、花了誰的預算、碰到誰的資料,都要查得到,這篇看下載回來的模型檔案本身乾不乾淨。 從 Model Hub 或供應...
這個系列會從一個能開 IT 工單的 Agent 出發,慢慢補上它真正需要的安全邊界。 我還是學生,沒有真的在公司處理 Helpdesk,也沒有 Jira、內...
查核資訊: 本文於 2026-08-25 查核 NIST AI Risk Management Framework、NIST AI 600-1、NIST SP...
iThome鐵人賽